Skip to content
2026-09-29 04:20493 字AIDeepSeek注意力机制长上下文

DeepSeek NSA 稀疏注意力 ​

NSA(Native Sparse Attention,原生稀疏注意力)是 DeepSeek 于 2025 年 2 月提出的稀疏注意力机制,核心价值是让稀疏注意力在训练和推理阶段保持一致,从而在长上下文场景显著降本增效。

解决的核心问题 ​

传统稀疏注意力常见的痛点是训练与推理割裂:训练时用稠密注意力、推理时才切稀疏,导致推理阶段模型能力下降。NSA 的「Native(原生)」正指它在训练阶段就以稀疏形态参与,训练推理统一,避免能力损失。

三个「同时」 ​

维度NSA 的做法
训练 vs 推理同一套稀疏机制贯穿训练与推理,不产生能力落差
预填充 vs 解码同时作用于 prefill(预填充)与 decode(解码)阶段,兼顾长文摘要与长代码输出
架构兼容与 GQA、MQA 等高效注意力架构兼容,可叠加降本

效果(64K 上下文) ​

  • 后向传播(训练反向)速度提升约 6 倍
  • 前向传播速度提升约 9 倍
  • 解码速度提升约 11.6 倍
  • 长上下文推理成本显著下降,且推理任务性能不降反升

定位 ​

NSA 属于 DeepSeek 在「模型架构创新」上的一环,与 MLA(省 KV 显存)、MoE(省激活算力)互补:MLA/MoE 优化的是「算什么、存什么」,NSA 优化的是「注意力算多少」。

⚠️ 时效:数据来自 2025-05 第三方综述文章,具体倍数以官方论文/仓库为准。

延伸 ​

每一篇文章,都是时间的标本